主题
概念卡片:AI Agent
一句话机制:Agent 是「会做事的大模型」——它把「理解任务、拆解步骤、调用工具、执行反馈、记住结果」五个能力组装成一个自动执行闭环,核心公式是 Agent = LLM(大脑)+ 工具调用 + 自动执行逻辑。
五要素架构
| 模块 | 职责 | 常见实现 |
|---|---|---|
| LLM | 理解任务、生成决策(「决定下一步做什么」) | GPT / Claude / Gemini |
| Memory | 记忆:短期=当前任务上下文;长期=历史数据/结果 | 向量库(FAISS)、Redis、本地库 |
| Tools | 真正「做事」的能力层 | 浏览器自动化(Playwright)、API、DB、文件、Shell |
| Planner | 把复杂任务拆成多步 | 「竞品分析」→ 采集→抓取→分析→出报告 |
| Executor | 调用工具、执行、返回结果 | 框架内置循环 |
最小 Agent 的执行循环
用户输入任务 → LLM 分析 → 生成步骤 → 调用工具 → 返回结果 → 判断是否继续(循环)典型落地场景(及各自关键约束)
| 场景 | Agent 做什么 | 关键约束 |
|---|---|---|
| 跨境电商 | 上架/价格监控/评论抓取/竞品分析 | 账号隔离 |
| 社媒账号矩阵 | 自动注册/定时发布/自动回复 | IP 环境必须隔离(代理网络分账号独立 IP) |
| 数据采集 | 自动识别页面结构、适配变化、自主修复 | 页面变化导致规则失效 |
| 自动化网赚 | CPA/Affiliate 自动注册+引流 | 合规风险高 |
不变量(必须成立的约束)
- 「工具调用才是难点」:模型能力往往够,瓶颈在工具链稳定性(页面变化、API 限流、网络抖动)——这是 Agent 落地失败的第一原因。
- Agent 不稳定是常态:复杂任务容易「卡住、误判、成本失控」,不是调一次就稳。
- 网络环境影响巨大:自动注册/社媒/抓取类任务,IP 环境不稳定直接导致任务失败。
常见误解
- 以为 Agent = 换个皮的 ChatGPT → ChatGPT 只「答话」,Agent 的差异在「自主调用工具执行任务」。
- 以为难在模型 → 难在工具链和流程编排,模型只是其中一个环节。
- 以为「AutoGPT 一挂就能全自动」→ 早期 AutoGPT 自主循环决策强但生产稳定性差,落地需人工在环(Human-in-the-loop)。
关联
- 总览:AI大模型技术栈总览
- 协议层(Agent 怎么连工具/连 Agent):概念卡片:MCP与Agent协议
- 框架选型:[对比分析:AI Agent框架选型](./对比分析:AI Agent框架选型)
- 源:
B40-资源/语雀-Code-Summary/AITech/(AIAgent指南 / 初识OpenClaw / OpenClaw 系列)